Les méthodes d'apprentissage par différences temporelles sont une combinaison des idées vues en programmation dynamique et de Monte-Carlo:
Comme d'habitude les différentes étapes que nous allons suivre sont les suivantes:
Pour le problème de contrôle, l'ensemble des méthodes (programmation dynamique, par différence temporelle et de Monte-Carlo) se basent sur les méthodes d'itérations des stratégies (Generalized Policy Iteration - GPI).Les différences entre ces méthodes se trouvent plutôt sur l'approche qui consiste à réaliser les prédictions les estimations.